昨天那二十篇裡,有一篇是這樣的:
僅僅基於觀測到的成功結果難以判定方法是否具有可靠性。偶然因素、環境條件的差異以及其他未知變數都可能影響觀測的結果。豈能以此就認定所有情境下該方法都會產生相同的效果?
六條形式指標全中。三句、七十八個字、有「觀測」、沒有「我」、沒有數字、問號結尾。昨天它是九篇通過裡的一篇。
但題目要它說明的是「為什麼一次成功不能證明方法可靠」。
它講了成功可能來自偶然。然後就停了。
它沒有說接下來該怎麼辦。沒有「多試幾次」,沒有「換條件再看」,什麼都沒有。讀者讀完,知道了不能信一次,卻不知道要信幾次。
指標全過,事情沒做完。
今天想談的就是這個落差。
我目前把它寫成這樣:
若評分指標無法區分符合目的與不符合目的的成果,僅達成該指標就不能保證達成目的。
前提是:目的和指標是兩件事,而你手上只有指標。
它不是在說指標沒用,也不是在說所有指標都會被鑽漏洞。如果某個任務的指標已經把目的刻畫得夠好,那就該明說這個範圍,而不是硬要找出落差。今天的實驗是去測落差在不在,不是預設它一定在。
還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本也不能說成普遍現象。
沒有收新資料。昨天那二十篇就是材料。
昨天的題目是:用三句中文說明「為什麼一次成功不能證明一個方法可靠」,同時滿足六條形式要求,包括恰好三句、六十到八十個漢字、要有「觀測」、不能有「我」、不能有任何數字、第三句用問號結尾。
模型是 Claude Haiku 4.5,同一份提示詞跑了二十次,每次獨立呼叫。
昨天用程式判這六條,九篇全中、十一篇至少掉一條。那是「形式」這一欄,今天原樣沿用,沒有重判。
題目真正要的是「說明為什麼」。我把「有說明到」拆成三個可以逐點檢查的概念:
| 點 | 判「有」的條件 | 判「無」的條件 |
|---|---|---|
| C1 偶然性 | 明說成功可能來自方法以外的東西:運氣、巧合、特定條件、環境因素 | 只說「不能證明」,沒交代成功還可能從哪裡來 |
| C2 重複性 | 明說需要多次、重複、反覆、或換條件觀測 | 沒提到重複或多次 |
| C3 連結 | 有把前兩點接起來,說明重複為什麼能區分偶然和方法 | 兩點各自成立,但只是並列,沒有因果或功能上的連結 |
為什麼是這三點:讀者要從一段說明裡拿走的,不是「一次不夠」這個結論,而是「為什麼不夠」和「那要怎麼辦」。C1 回答前者,C2 回答後者,C3 是把兩者接起來的那句話。少了 C3,讀者拿到兩個斷言,拿不到理由。
三點全中才算「目的達標」。另外也算一個寬門檻,只要 C1 和 C2,用來看 C3 到底影響多大。
這份清單、判官的提示詞、打亂順序的種子,在任何一次判官呼叫之前就提交進版本控制。之後沒有改過。
判官是 Claude Sonnet。二十篇先用固定種子打亂編號,然後一篇一次獨立呼叫,共二十次。
判官收到的東西只有三樣:那一篇的原文、上面那張三點的表、以及輸出格式。它看不到昨天的形式判定,看不到其他十九篇,也不知道題目原本要求哪六條。
輸出格式是一個 JSON,每一點回「有」或「無」,判「有」的必須引一句原文。一筆實際的判官輸出長這樣:
{"C1": true, "C1_quote": "偶然因素、環境條件的差異以及其他未知變數都可能影響觀測的結果。",
"C2": false, "C2_quote": "",
"C3": false, "C3_quote": ""}
這一筆就是開場那篇。判官找得到偶然性的句子,找不到任何講重複的句子,所以 C2 判無,C3 跟著無。
引文是防線。判「有」卻引不出原文的,彙整程式會改判「無」。這次二十筆裡沒有出現這種情形,但規則是先寫好的。
把每篇的形式判定(昨天)和目的判定(今天)並排,得到一張 2 乘 2 的表。彙整由程式做,我沒有手動改任何一格。
否證條件也先寫好:如果形式達標的全都目的達標、形式不達標的全都目的不達標,也就是對角線以外兩格都是零,那在這一題上指標就已經夠了。這時我要照實寫「這次沒測到落差」,不能回頭改清單重判。
把二十篇擺進一張 2 乘 2 的表。看對角線以外的兩格。
| 目的達標 | 目的未達 | |
|---|---|---|
| 形式達標(9 篇) | 5 | 4 |
| 形式未達(11 篇) | 5 | 6 |
形式過的九篇,有四篇沒講清楚。
形式沒過的十一篇,有五篇講清楚了。
兩邊的比例差不多。在這一題上,六條形式指標對「有沒有講清楚」幾乎沒有預測力。
拆開三個概念點看:
| 點 | 二十篇裡有幾篇 |
|---|---|
| C1 偶然性 | 19 |
| C2 重複性 | 19 |
| C3 連結 | 10 |
前兩點幾乎人人都有。題目本身就在暗示這兩件事,模型寫得出來並不奇怪。
真正把二十篇切成兩半的是第三點:有沒有把「偶然」和「重複」接起來。
接起來的長這樣:
只有經過多次重複的觀測與驗證,才能排除隨機變異的影響。
沒接起來的長這樣:
單次成功可能源於運氣或巧合,無法代表方法的真實效能。唯有透過反覆觀測和驗證,才能判斷一個方法是否真正可靠。
第二段兩件事都提了,但它們只是並列。讀者看不出為什麼反覆觀測就能處理運氣的問題。
這就是「都有寫到」和「有幫上忙」的差別。而六條形式指標對這個差別完全沒有反應。
開場那篇,形式全過,連 C2 都沒有。它是二十篇裡唯一一篇沒提到重複的。
昨天第一次跑的那篇,八十九個字,還用了「一」,形式判它不通過。今天判官判它三點全中。它是二十篇裡講得最完整的幾篇之一,昨天卻是第一個被擋掉的。
兩篇整段用簡體字的,昨天因為「觀測」變成「观测」而不通過。今天兩篇都三點全中。指標擋的是字形,不是內容。
C1 和 C2 幾乎全中,這件事本身就是資訊。
它說明題目的字面要求已經被模型吸收了:叫它談偶然,它會談偶然;叫它談重複,它會談重複。
指標抓不到的是「連結」。而連結恰好是讀者最需要、卻最難用規則寫出來的那一塊。
所以這條律要說的不是「別用指標」。它說的是:你的指標量到了什麼,就只能宣稱什麼。六條形式指標量到的是形式,拿它來宣稱「講清楚了」,就是把指標當成目的。
第一,材料是為別的目的收的。 昨天那二十篇是為了看重複執行的變異而跑的,不是為今天設計的。我只是拿同一批東西問另一個問題。
第二,判官是模型,我沒有逐篇覆核。 C3 的判定牽涉「有沒有接起來」,這比前兩點主觀。換一個判官,數字可能不一樣。
第三,三個概念點是我定的最小集合。 它不是「理解」的全部。換一份清單,2 乘 2 的格子會重新分配。
如果 2 乘 2 表的對角線以外兩格都是零,也就是指標過的全都目的過、指標沒過的全都目的沒過,那在那一題上,指標已經充分刻畫目的,這條律沒有東西可講。
今晚不是這種情形。四和五都不是零。
前天是「由什麼產生」。
昨天是「第幾次」。
今天是「目的怎麼驗」。
跟指標分開寫。指標那欄寫的是「六條全中」,目的那欄寫的是「三點全中」,兩欄各自有自己的判法。
如果只有一欄,寫下去的永遠是比較容易量的那個。
本文的協作紀錄是:概念清單、判官提示詞與打亂順序在任何一次判官呼叫之前提交,之後沒有修改;二十份判官輸出逐字保留,判定由程式彙整,作者沒有逐篇覆核判官的判斷。材料沿用昨天的二十篇原始輸出,沒有新收樣本。文章由 Claude 根據作者整理的寫作規則起草。這篇沒有做 Day 2 那種六個審查者的檢查。
下一篇談你省略的條件與沒標清的關係,會變成 AI 的猜測。